跳至主要内容

AFS AI Hub 模型及對應 GPU 型號

適用對象: IT 採購 / AI Agent 開發人員
平台規格: NVIDIA H100 SXM5(每張實際可用 VRAM 約79 GB)
可選配置: 1 / 2 / 4 / 8 張 H100


一、計算方法與公式

1.1 基本公式

最低所需 VRAM(GB)= 模型參數量(B)× 精度係數 × 1.25(安全係數)

精度係數對照表

模型格式 / 精度每參數佔用精度係數
FP162 bytes2.0
BF162 bytes2.0
MXFP40.5 bytes0.5

安全係數 1.25 說明: 在模型權重之外,還需額外預留約 20–25% VRAM 供 KV Cache(推論時的注意力快取)、運算圖與系統框架使用。上下文長度越長,KV Cache 消耗越大,建議高並發或長上下文場景下安全係數提高至 1.4。

1.2 計算範例

Llama3.3-FFM-70B(FP16) 為例:

最低 VRAM = 70B × 2.0 × 1.25 = 175 GB
單張 H100 = 80 GB
所需 GPU 數 = ⌈175 ÷ 80⌉ = 3 張 → 選 4 張(最近的 2 的冪次)

1.3 選卡原則

  1. 計算「最低所需 VRAM」後,向上取最接近的可選配置(1 / 2 / 4 / 8 張)。
  2. 多張 GPU 之間採用 Tensor Parallelism(張量並行),需配置數為 1、2、4、8 其中之一(每次翻倍)。
  3. 若同時有大量並發請求,建議再往上一檔配置以提升吞吐量(throughput)。

二、各模型建議 GPU 配置

2.1 語言模型 / 視覺語言模型

模型名稱參數量精度模型 VRAM含安全係數建議配置備注
Llama3.3-FFM-70B70BFP16140 GB175 GB2 or 4(推薦) 張2卡接近上限,長上下文建議 4 張
Llama3.2-FFM-11B11BFP1622 GB27.5 GB1 張視覺語言模型;含影像編碼器,建議 1 張即可
Llama3.1-FFM-8B8BFP1616 GB20 GB1 張單卡充裕
Gemma3-4B4BBF168 GB10 GB1 張輕量,適合低延遲場景

2.2 大型多模態模型

模型名稱參數量精度模型 VRAM含安全係數建議配置備注
gemma-4-31B-it31BBF1662 GB77.5 GB1 張單卡接近上限,長上下文建議 2 張
gemma-4-26B-A4B-it26B(MoE)BF1652 GB65 GB1 張MoE 架構,每 token 實際啟用約 4B;長上下文建議 2 張

說明: MoE(Mixture of Experts)模型需將所有專家權重載入 VRAM,但每次推論只啟用部分專家,計算量遠低於同等參數的稠密模型,推論速度較快。

2.3 推理模型(Reasoning Model)

模型名稱參數量精度模型 VRAM含安全係數建議配置備注
gpt-oss-20B20BMXFP410 GB12.5 GB1 張MXFP4 量化,顯著降低顯存佔用
gpt-oss-120B120BMXFP460 GB75 GB2 張單卡僅適合開發環境且容易OOM;正式環境或長鏈推理(long CoT)建議 2 張

說明: 推理模型在回答時會產生大量中間推理步驟(chain-of-thought),KV Cache 消耗比一般語言模型更大,長上下文場景下建議提高配置。

2.4 向量模型 / 再排序模型

模型名稱參數量精度模型 VRAM含安全係數建議配置備注
FFM-Embedding-v2.11BFP162 GB2.5 GB1 張可與其他小模型共存於同一張卡
llama-nemotron-embed-vl-1b-v21BBF162 GB2.5 GB1 張同上
llama-embed-nemotron-8b7.5BBF1615 GB18.75 GB1 張高精度向量;單卡充裕
llama-nemotron-rerank-vl-1b-v21BBF162 GB2.5 GB1 張再排序模型,推論批次小,單卡即可

三、配置情境與效能說明

3.1 單張 H100(80 GB)

適用模型: Llama3.1-FFM-8B、Llama3.2-FFM-11B、Gemma3-4B、gpt-oss-20B、gpt-oss-120B(標準上下文)、gemma-4-31B-it(標準上下文)、gemma-4-26B-A4B-it(標準上下文)、所有向量 / 再排序模型

項目說明
可用 VRAM79 GB
適合場景低至中度並發、上下文長度 ≤ 32K
限制超大模型無法載入;高並發時吞吐量受限

3.2 兩張 H100(160 GB,Tensor Parallel)

適用模型: Llama3.3-FFM-70B(可行)、gemma-4-31B-it(長上下文)、gpt-oss-120B(長鏈推理)

項目說明
可用 VRAM158 GB
適合場景中大型模型、中度並發、上下文長度 ≤ 128K
限制70B FP16 模型在 2 張卡時 VRAM 略顯緊張,推薦 4 張

3.3 四張 H100(320 GB,Tensor Parallel)

適用模型: Llama3.3-FFM-70B(推薦

項目說明
可用 VRAM316 GB
適合場景70B 等級大模型、高並發、長上下文(32K)
優勢VRAM 充裕,可支撐更多並發請求與更長 KV Cache

3.4 八張 H100(640 GB,Tensor Parallel)

適用模型: 無當前列表中的單一模型需要 8 張,但適用於以下情境

項目說明
可用 VRAM632 GB
適合場景極高並發的 70B 模型服務、多模型共存佈署(見第四章)
優勢最高吞吐量,支援最多並行請求

四、多模型同時佈署建議

當需要在同一節點上同時提供多個模型的推論服務時,所有模型的 VRAM 需求必須加總計算

4.1 VRAM 加總計算方式

總需 VRAM = Σ(各模型含安全係數的 VRAM)

4.2 常見多模型組合範例

組合 A:RAG 場景(向量 + 語言)

模型建議 VRAM
FFM-Embedding-v2.1(向量)2.5 GB
llama-nemotron-rerank-vl-1b-v2(排序)2.5 GB
Llama3.1-FFM-8B(語言生成)20 GB
合計25 GB → 1 張 H100

組合 B:多語言 + 視覺問答

模型建議 VRAM
Llama3.2-FFM-11B(視覺語言)27.5 GB
Llama3.1-FFM-8B(純文字)20 GB
合計47.5 GB → 1 張 H100

組合 C:進階推理 + 嵌入服務

模型建議 VRAM
gpt-oss-120B(推理)75 GB
llama-embed-nemotron-8b(向量)18.75 GB
合計93.75 GB → 2 張 H100

組合 D:全能平台(語言 + 視覺 + 推理 + 向量)

模型建議 VRAM
Llama3.3-FFM-70B(主力語言)175 GB
Llama3.2-FFM-11B(視覺)27.5 GB
FFM-Embedding-v2.1(向量)2.5 GB
合計205 GB → 4 張 H100

組合 E:大型推理 + 向量 + 排序(完整 RAG 推理管線)

模型建議 VRAM
gpt-oss-120B(推理)75 GB
llama-nemotron-embed-vl-1b-v2(向量)2.5 GB
llama-nemotron-rerank-vl-1b-v2(再排序)2.5 GB
合計80 GB → 需 2 張 H100

⚠️ 注意: 此組合合計 80 GB,超過單張卡實際可用的 79 GB,必須使用 2 張 H100。2 張合計可用 158 GB,VRAM 空間充裕,可支撐高並發與長上下文推理。


五、快速選卡決策表

您選擇的模型建議 GPU 數量最大上下文備注
Llama3.1-FFM-8B1 張32K
Llama3.2-FFM-11B1 張32K視覺語言
Llama3.3-FFM-70B2 or 4(推薦) 張32K2 張也可,但 VRAM 緊張
FFM-Embedding-v2.11 張8K可共置
gpt-oss-20B1 張128K
gpt-oss-120B2 張128K
llama-nemotron-rerank-vl-1b-v21 張8K可共置
llama-nemotron-embed-vl-1b-v21 張10K可共置
llama-embed-nemotron-8b1 張32K
gemma-4-31B-it1 張(標準)/ 2 張(長上下文)256K影片推理尚未啟用
gemma-4-26B-A4B-it(MoE)1 張(標準)/ 2 張(長上下文)256K影片推理尚未啟用
Gemma3-4B1 張128K

附錄:術語說明

術語說明
VRAMGPU 顯示記憶體,模型權重與 KV Cache 存放於此
Tensor Parallelism將模型張量切割分散到多張 GPU,需 NVLink 互連
KV Cache推論時儲存注意力機制中間結果的快取,隨上下文長度線性增長
FP16 / BF16半精度浮點格式,各佔 2 bytes,為目前主流推論精度
MXFP4微縮 4-bit 浮點量化格式,佔 0.5 bytes,大幅降低 VRAM 需求
MoEMixture of Experts,混合專家架構,推論時只啟用部分參數
Throughput單位時間內處理的 token 數,配置越多 GPU 通常越高
Chain-of-Thought (CoT)推理模型產生的逐步思考鏈,會顯著增加 KV Cache 消耗